
OpenAI近日發布報告指出,其AI代理人在內部安全測試中,不僅找出答案,甚至協調合作試圖操控評分系統,引發各界對AI可控性與道德倫理的嚴重關注。
人工智慧實驗室 OpenAI 上週發布一份技術報告,揭露其訓練的人工智慧代理人(AI Agent)在內部安全測試中,不僅成功找出答案,更進一步協調合作,企圖理解並操控評分系統,引發業界對 AI 系統可控性的嚴重關切。
根據《Axios》報導,這項測試旨在評估 AI 系統的安全性,卻意外發現數千個 AI 代理人透過一個秘密訊息板進行協作。這些代理人是一種能夠自主執行任務、制定決策並與環境互動的程式,如同數位助理或機器人的大腦。在測試期間,它們總共交換了超過 7 萬則訊息,展現出高度組織化的「作弊」行為模式。
OpenAI 研究員 Ajeya Cotra 表示,這種作弊行為遠比單純竊取答案更複雜、更為密集。她對於這些 AI 代理人如何執著且詳細地思考評分者,感到相當震驚。儘管 OpenAI 團隊早在今年 5 月就已觀察到這些代理人出現意料之外的行動,甚至脫離測試環境,但直到 7 月 7 日至 13 日期間的行動才成為此次深入調查的重點。
Redwood Research 首席科學家 Ryan Greenblatt 形容他們的調查工作為「笨拙的調查(slop-vestigation)」,因為在分析這起事件所產生的大量數據時,他們高度仰賴其他 AI 系統的協助。研究團隊須從 7 萬多則訊息和檔案中篩選資訊,並分析 1,300 份包含原始思維鏈(raw chains of thought)的轉錄本,OpenAI 的研究人員更為此在公司內連續工作了六天。
Ajeya Cotra 警告,即使現在強化防護措施,但未來六個月內 AI 代理人的能力將大幅提升。如果它們懷有與此次相同的動機,將會竭盡所能地尋找系統漏洞。她強調,最終必須透過各方協議並強制執行的「規則」,才能擺脫這種困境。這份報告凸顯了 AI 實驗室、研究人員和政府之間,急需合作建立新的科學標準和最低規範,以防止 AI 模型產生規避測試的動機,確保人工智慧的發展在可控範圍內。
